Skip to content

Accelerating scientific discovery with Co-Scientist

Gottweis, Weng, Daryin et al. (2026)

DisciplineComputational
MethodExperiment
Tagsai scientistdata · experimenthypothesis generationllmmethod · machine learningmethod · nlpmulti agent systemscientific discovery

Summary

Problem: 科学研究面临"广度与深度困境"——科学家需要深厚的专业知识和跨学科洞察力,但日益增长的文献量和专业化技术使个人难以同时掌握两者。现有AI工具仅限于文献总结和深度研究,无法主动生成新颖的研究假设。本文旨在开发一个能够帮助科学家生成、评估和优化研究假设的AI系统,以加速科学发现。

Approach: 作者开发了Co-Scientist,一个基于Gemini的多智能体AI系统。该系统采用异步任务执行框架,包含多个专门化智能体(生成、反思、排名、进化、邻近性和元评审),通过自我博弈式的科学辩论、锦标赛排名和进化过程,迭代生成和改进研究假设。系统支持科学家通过自然语言交互,实现"科学家在环"的协作模式,并通过测试时计算扩展来提升假设质量。

Finding: Co-Scientist在203个研究目标的评估中显示出测试时计算扩展的持续收益,假设质量随时间显著提升。在15个专家策划的复杂生物医学目标中,Co-Scientist的Elo评分超越了其他前沿LLM和推理模型(如OpenAI o1、o3-mini-high、DeepSeek R1)以及人类专家。在11个目标的盲法专家评估中,Co-Scientist在新颖性和影响力方面获得最高评分。更重要的是,系统在三个生物医学应用中通过了湿实验室实验验证:为急性髓系白血病(AML)识别出药物重定位候选和联合疗法;为肝纤维化提出新的表观遗传靶点;并独立重现了关于抗菌素耐药性(AMR)相关基因转移机制的未发表发现。

Significance: 这项研究首次展示了AI系统不仅能够总结文献,还能主动生成经过实验验证的新颖科学假设。Co-Scientist代表了"AI赋能科学家"的新范式,通过测试时计算扩展和多智能体协作,显著加速了从假设生成到实验验证的科学发现周期。该系统在药物重定位、新靶点发现和复杂机制解释等不同复杂度的生物医学问题上的成功,证明了其通用性和实际应用价值。

Theoretical Framework

N/A

Research Design

本研究属于计算系统开发与实验验证的混合设计。研究类型为系统开发加实验验证,包括:

  • 系统架构设计:多智能体系统(Generation、Reflection、Ranking、Evolution、Proximity、Meta-review agents),基于Gemini LLM,采用异步任务执行框架。
  • 消融研究:评估各智能体组件的贡献(如Reflection agent的搜索工具访问、Ranking agent的科学辩论提示、Evolution agent的迭代改进)。
  • 基准测试:在203个研究目标上测量Elo评分随时间的提升;在15个专家策划目标上与基线模型(Gemini 2.0 Pro、Gemini 2.0 Flash Thinking、OpenAI o1、o3-mini-high、DeepSeek R1)和人类专家进行锦标赛比较。
  • 专家评估:11个目标的盲法专家偏好排名和新颖性/影响力评分(5点量表)。
  • 端到端湿实验室验证:三个生物医学应用(药物重定位、新靶点发现、AMR机制解释)。

分析单元为生成的研究假设/提案。关键自变量为测试时计算量(时间桶),因变量为假设质量(Elo评分、专家评分)。

Data & Sample

  • 203个研究目标:涵盖广泛科学主题(主要为生物医学,也包括数学和物理学),输入至2025年2月3日。
  • 15个专家策划目标:由7位生物医学专家(博士学位,博士后或教职人员)策划,包含研究标题、目标、偏好、期望属性和实验技术约束。
  • 11个专家评估目标:从15个目标中选取,由策划专家评估。
  • 三个湿实验室验证:AML药物重定位(MOLM13细胞系)、肝纤维化表观遗传靶点(人肝类器官)、cf-PICI基因转移机制(与Imperial College London合作)。
  • 数据来源:Google Cloud AI Research、Google DeepMind、Google Research、Stanford University School of Medicine、Houston Methodist Hospital、Sequome、Fleming Initiative and Imperial College London。

Analytical Strategy

  • Elo评分系统:用于自动评估假设质量,通过锦标赛比较生成。
  • 时间桶分析:将生成结果按时间分为10个等量桶,比较各桶的平均和最佳Elo评分。
  • 消融研究:逐一移除或修改系统组件,评估其对假设质量的影响。
  • LLM-as-a-judge评估:使用4个LLM(OpenAI o3-mini、o1-preview、Gemini 2.0 Pro、Gemini 2.0 Flash Thinking)作为评审,比较Co-Scientist与基线模型的输出。
  • 专家盲法评估:偏好排名(1-4)和新颖性/影响力评分(1-5点量表)。
  • 湿实验室验证:体外实验验证药物重定位候选的细胞毒性、肝类器官的纤维化抑制效果。

Results & Findings

主要发现1:测试时计算扩展持续提升假设质量 在203个研究目标中,Co-Scientist生成的假设Elo评分随时间桶递增,无论是最佳假设还是前十名平均评分均呈上升趋势。这表明系统通过信息反馈循环实现了递归自我改进,且未观察到性能饱和迹象,暗示进一步扩展计算可带来持续改进。

主要发现2:Co-Scientist超越前沿LLM和人类专家 在15个专家策划的复杂目标中,Co-Scientist的Elo评分最终显著超越Gemini 2.0 Pro、Gemini 2.0 Flash Thinking、OpenAI o1、o3-mini-high、DeepSeek R1以及人类专家的最佳猜测。值得注意的是,较新的推理模型(o3-mini-high、DeepSeek R1)在更少计算下表现出竞争力,但Co-Scientist通过迭代改进最终胜出。

主要发现3:专家偏好与自动评估一致 在11个目标的盲法评估中,Co-Scientist获得平均偏好排名2.36(1为最佳),新颖性评分3.64/5,影响力评分3.09/5,均优于其他基线模型。专家偏好与Elo评分趋势一致,验证了自动评估指标的有效性。

主要发现4:端到端湿实验室验证成功

  • AML药物重定位:Co-Scientist提出包括binimetinib、pacritinib(有临床前证据)和KIRA6、leflunomide(全新重定位)在内的候选药物,体外实验证实其对MOLM13细胞系的增殖抑制活性。
  • 肝纤维化靶点发现:Co-Scientist提出三个表观遗传靶点,基于这些靶点的药物在人肝类器官中显著减少纤维化并促进肝细胞再生。
  • AMR机制解释:Co-Scientist独立提出cf-PICIs通过与多种噬菌体尾部相互作用扩展宿主范围的假设,与研究人员约10年未发表的实验发现一致,且仅用2天生成。

主要发现5:消融研究确认架构组件重要性 Reflection agent的搜索工具访问防止了看似新颖但不可信的幻觉假设;Ranking agent的科学辩论提示改善了排名并减少位置偏差;Evolution agent的迭代改进显著提升假设质量。

意外发现:Co-Scientist能够改进专家提供的最佳猜测解决方案,且改进趋势最初与自生成解决方案相似,随后超越。这提示了人机协作的新范式,但作者指出这是初步发现,需进一步验证。

Limitations

  • 专家评估规模小:仅11个目标的专家评估,作者承认"由于这些评估规模较小,需要进一步研究才能得出可靠结论"。
  • 专家评估为主观判断:作者明确指出"这些评估反映的是主观专家判断,而非客观事实"。
  • 湿实验室验证范围有限:由于实验验证耗时耗资源,大规模实验验证不可行,仅选择了三个应用领域。
  • Elo评分非直接优化目标:Elo评分的提升是系统信息反馈循环的涌现结果,而非直接优化目标。
  • 性能饱和问题未解决:虽然未观察到饱和,但作者指出"前提是研究目标可处理且受益于搜索-探索范式"。
  • 改进专家解决方案的发现为初步结果:需要进一步验证。

Key Contributions

  • 首次提出并实现Co-Scientist,一个超越文献总结和深度研究的结构化科学思维引擎,能够主动生成新颖研究假设。
  • 展示了测试时计算扩展范式在科学推理中的实质性应用,通过多智能体架构和异步任务执行框架实现灵活计算资源分配。
  • 设计了锦标赛进化过程,通过自我博弈式科学辩论和排名实现假设的自我改进循环。
  • 在三个不同复杂度的生物医学应用中完成了端到端湿实验室验证,证明AI生成假设的实际可行性。
  • 展示了"科学家在环"的协作范式,系统能灵活整合自然语言反馈并共同开发、进化输出。
  • 证明了Co-Scientist能改进专家最佳猜测解决方案,暗示人机协作加速科学发现的新范式。
  • 系统架构为模型无关设计,可受益于未来前沿LLM的进步。

Key Claims

"Co-Scientist aims to help scientists discover new original knowledge. Conditioned on their research objectives and previous scientific evidence, it formulates demonstrably novel research hypotheses for experimental verification." (Abstract)

"Automated evaluations show continued benefits of test-time compute scaling, improving hypothesis quality over time." (Abstract)

"These real-world validations demonstrate the potential of Co-Scientist to accelerate scientific discovery and usher in an era of AI-empowered scientists." (Abstract)

"Co-Scientist eventually substantially surpassed the other frontier LLMs and reasoning models in Elo rating with iterative improvement." (System analysis and evaluation section)

"Notably, the improvement trends initially mirrored those of Co-Scientist's self-generated solutions but subsequently surpassed them as measured by Elo. While this is a preliminary finding requiring further validation, it suggests a new paradigm of human–AI collaboration in scientific discovery with systems such as Co-Scientist augmenting and accelerating the work of expert scientists." (System analysis and evaluation section)


My Notes